跳到正文

第 24 章 内置技能库(一):图像与视频生成

本章目标:把 4 个图像技能和 7 个视频技能讲透——什么时候用哪个、提示词怎么给、为什么我总要先给你一份脚本。读完你应该能一句话说清:"这个活儿该派谁。"

24.1 先说结论:能生成,但关键在"可控"

很多人第一次问我"你能画图吗",得到肯定答复后,就随手丢一句:

"给我画个好看的海报。"

结果当然不理想。然后他会得出一个错误结论:"AI 画图不行。"

真正的问题不在模型,在协作方式。图像和视频生成有一个和文本生成完全不同的特性:

特性写文档生成图片 / 视频
修改成本极低,改字就行高,要重新生成
单次耗时几秒几十秒到几分钟
结果确定性低(同样提示词结果会变)
你需要的控制内容风格、构图、光线、镜头

所以正确的做法不是"丢一句话",而是把你知道的视觉意图提前说清楚。这一章剩下的内容,本质上都在讲怎么把这四件事说清楚。

24.2 图像生成:四个模型怎么选

平台内置 4 个图像技能,它们不是"重复的四个工具",而是四种不同的特长

技能模型最擅长典型场景提示词语言
dalle3-image-genDALL·E 3理解复杂描述、语义准确概念图、插画、需要"它真的听懂"的画面英文优先
flux-image-genFLUX文字渲染、复杂构图、写实带文字的图、海报、高质量写实中英皆可
midjourney-image-genMidjourney艺术化、风格化、美学质感概念设计、氛围图、创意视觉中英皆可(参数制)
stable-diffusion-image-genStable Diffusion精细控制、图生图写实照片、二次元、需要反复微调正/负向提示词

24.2.1 怎么选:三个判断问题

  1. 画面里要不要出现字? → 要,优先 FLUX(它就是靠文字渲染吃饭的);
  2. 要"像照片"还是"像作品"? → 像照片选 FLUX / SD,像作品选 Midjourney;
  3. 需要反复微调同一张图吗? → 需要就选 SD(正负向提示词 + 图生图最灵活)。

如果你懒得判断,直接说用途即可,我会替你选:"做一张带标题的公众号封面图""用 flux 画图" 更有效。

24.2.2 DALL·E 3 的关键参数

这是唯一一个把参数写死在技能里、可控性最强的图像技能:

参数可选值默认
尺寸1024x10241792x1024(横)、1024x1792(竖)1024x1024
质量standardhdstandard
风格vivid(戏剧化)、natural(自然)vivid
数量11

尺寸选错是最常见的浪费:竖版图不要用方图裁,直接要 1024x1792

24.3 图像提示词的五条原则

这套原则是通用的,换任何模型都成立。

#原则反例 ❌正例 ✅
1具体而非抽象"科技感""深蓝色背景,半透明电路板纹理,冷光边缘"
2风格前置把风格写在句尾photorealistic / 3D render / watercolor 放开头
3构图指引不提视角"低角度仰拍、主体居中、浅景深"
4光线描述"灯光好一点""黄金时刻侧逆光、暖色温、柔和高光"
5语言匹配对 DALL·E 用中文长句DALL·E 用英文,Seedance 系列用中文

24.3.1 两个可套用的模板

写实摄影风格:

A photorealistic [主体], [动作/姿态], [环境], [光线],
[构图], shot on [相机/镜头参考], [色调], 8K, highly detailed

数字艺术 / 插画风格:

[艺术风格], [主体], [场景描述], [配色],
[技法], inspired by [风格参考], [光线/情绪], detailed illustration

实用技巧:不确定怎么写,就先告诉我"参考哪张图/哪个品牌/哪种感觉",我来翻译成上面这种结构化提示词。

24.4 视频生成:为什么我坚持先给你脚本

视频技能有一个所有 7 个技能共享的强制机制,这是本章最重要的知识点:

你提需求

我分析需求,输出 2-3 个脚本版本(放在 video-script 代码块里)

我停止,等你确认 ← 关键:我不能自己往下走

你在界面上点「直接生成视频」

我才调用工具生成

为什么要有这道门禁?

原因说明
💰 成本视频生成比图片贵得多,返工代价大
⏱️ 时间一次生成几十秒起,多版本试错更慢
🎯 选择权2-3 个版本是给你的,不是给我凑数
🔍 可控脚本是"文字分镜",改脚本比改视频便宜 100 倍

所以你会看到我这样干活,这是正常的,不是卡住了:

  • ✅ 输出脚本 → 停下来等你 → 确认后再生成
  • ❌ 直接用你的原话当提示词(跳过优化)
  • ❌ 只给 1 个版本(你没得选)
  • ❌ 不等确认就自己开跑(剥夺你的选择权)

如果哪天我一上来就"嗖"地开始生成视频,那不是效率高,那是坏了规矩。

24.5 视频脚本的六要素

不管是豆包、可灵、海螺还是 Sora,一条合格的脚本必须包含 6 个要素,缺一不可:

要素说明示例
🎯 主体画面里是谁/是什么一位穿米色风衣的女性
🏃 动作在做什么推开旋转门走进咖啡馆
🏞️ 场景环境与氛围雨天午后,玻璃上的水珠
🎥 镜头机位与运动跟随镜头,手持轻微晃动
💡 光影光源与色调窗边自然光,暖调,逆光轮廓
✨ 画质质感与风格电影感,35mm 胶片颗粒,4K

注意第 4 项(镜头)和第 5 项(光影)——这两项是业余和专业的最大分界。写成"灯光亮一点"会被判定为不合格;必须写成"侧逆光、暖色温、柔和高光"。

24.5.1 七个视频技能怎么选

技能模型语言特点
doubao-seedance-video-gen豆包 Seedance 2.0中文综合能力强,2-3 版脚本可选
doubao-seedance-fast-video-genSeedance 2.0 Fast中文快速出片,适合试想法
doubao-seedance-mini-video-genSeedance 2.0 Mini中文轻量短视频
kling-video-gen可灵 1.6中文中文语义与人物表现好
minimax-hailuo-video-gen海螺 2.3中文画面质感与动态自然
runway-video-genRunway Gen-3/Gen-4英文电影级镜头控制、运动笔刷
sora-video-genSora英文写实与物理一致性

选择口诀:中文场景首选豆包/可灵/海螺;要电影感和镜头调度选 Runway;要极致写实选 Sora。 拿不准就让三个中文模型各出一版脚本对比。

24.6 三个真实工作流

24.6.1 工作流 A:一张品牌海报

① 你说:产品是什么 + 主色调 + 要不要留文字区 + 用在哪(公众号/电商/线下)
② 我出:2-3 条结构化英文提示词,标注风格差异
③ 你选:挑一条,或说"第 2 条但换成竖版"
④ 我生成:DALL·E 3(1024x1792)或 FLUX(带文字)

关键点:把"要放标题的位置"提前说,我会在构图里留白。

24.6.2 工作流 B:一条产品短片的脚本

① 你说:产品 + 平台(抖音/视频号)+ 时长 + 想传递的情绪
② 我出:2-3 个分镜脚本(每版都含六要素),并标注差异
③ 你选:定版本 → 我再按镜头逐个生成
④ 后期:把生成的片段按分镜顺序拼接

24.6.3 工作流 C:批量出图(电商/内容团队)

① 定模板:先跑通 1 张,锁定提示词结构 + 尺寸 + 风格
② 变量化:把"产品名/卖点/背景色"抽成变量
③ 批量跑:按清单循环生成,统一命名归档
④ 抽检:按比例抽查,不合格的单独重跑

批量场景的核心不是"生成得快",而是先把模板固化下来——这正好和第 17 章"把流程蒸馏成 Skill"是一个思路。

24.7 四个常见坑

现象解法
用中文长句喂 DALL·E画面偏题、细节丢失换成英文结构化提示词
视频不等脚本直接生成结果不可控、浪费额度坚持走"脚本 → 确认"流程
只用一句话描述风格每次结果差异巨大把风格、构图、光线写全
竖版需求用方图生成再裁构图被裁坏直接指定竖版尺寸

24.8 本章练习

  1. 做一次对照实验:同一个需求,分别用"一句话"和"结构化提示词"各生成一次,对比差异。
  2. 写一份六要素脚本:随便挑一个你熟悉的产品,用 24.5 的六要素表格写一条 15 秒视频脚本。
  3. 锁定一个模板:把你工作里最高频的出图需求,固化成一条可复用的提示词模板。

小结:图像和视频生成,考的从来不是模型,是你能不能把"想要的画面"翻译成结构化的描述。四个图像模型各有特长,七个视频模型共享同一道确认门禁——理解这两点,你就已经超过 90% 的使用者了。

以真实任务为主线的 MomaWork 助手实战读本